RMSNorm算子优化

目标：实现高性能的RMSNorm（Root Mean Square Normalization）CUDA内核，确保精度对齐且加速比≥1.3x

RMSNorm定义：
- 计算输入张量的均方根
- 应用归一化：output = input / sqrt(mean(input^2) + epsilon)
- 乘以可学习的权重参数

技术要求：
1. 精度对齐：与PyTorch原生实现完全一致，最大差异<1e-6
2. 性能优化：针对MetaX C500 GPU优化，加速比≥1.3x
3. 内存优化：高效的共享内存使用和并行规约
4. 边界处理：完善的边界检查机制

测试数据：128×256张量

预期结果：
- 精度差异：最大<1e-6，平均<1e-7
- 性能加速比：1.5x-2.0x
- 内存效率：优化的共享内存规约